01. 自我评估

在强化学习中,蒙特卡洛方法用什么原理来更新状态值函数 V(s)?

SOLUTION: 经历整个阶段,然后使用该阶段剩余部分的返回来更新遇到的每个状态的 V(s) 。

在训练 Deep Q Network (DQN) 时,如何消除连续经验元组之间相关性的不利影响?

SOLUTION: 将经验元组存储在缓冲区中,然后为每次训练迭代随机抽样一批次。

深度强化学习的策略梯度法比值函数逼近法更好,是因为:

SOLUTION: 它们可以直接用于连续行动空间。